上一篇提到了,我透過OWASP了解打造Claude skill掃毒軟體小章魚可能會要防禦的威脅。
這一篇我想分享LLM(Large Language Model大型語言模型)會面對的攻擊手法?越獄
越獄(Jailbreak),是指使用者透過特殊的提示詞技巧(Prompting),繞過模型內建的安全護欄與倫理道德限制,迫使 AI 回答原本被禁止回答的危險、違法或敏感內容。
一般情況下LLM都會透過對齊訓練(Alignment),如 RLHF 人類反饋強化學習,和系統提示詞(System Prompt),來給AI嚴格的設定,這是給LLM的一個安全監獄,但是會有許多人想要嘗試越過這個限制,這叫越獄。
為了更好的了解越獄,我會順便介紹LLM是怎麼預測下一步的?尤其是一視同仁和上下文理解的部分
主要會分成三個步驟
1.輸入與向量化,將文字轉成為可以被電腦理解的數學向量。
2.上下文理解與特徵提煉:透過注意力機制計算權重,並由FFN進行深度提煉。
3.預測下一個字(先略過)
文字要怎麼轉化成可以被電腦理解?
主要是先把句子根據先訓練過的對照表切成Token(LLM處理文字時的最小運算單位),每一個字、詞都有完整的Token ID。在模型當中每一個Token ID,都因為字詞的特徵,而有一個多達數千個維度的向量去做數字上的比較,而將這些數值的比較以空間來呈現就是語意向量,在這個語意向量空間會依照每一個Token ID 在不同維度、軸上有不同的數值,透過這個語意向量空間可以用數字表示出每個字詞的基本語意以及跟其他字詞的關係。
目前主流的LLM是透過Transformer通用神經網路架構,一種一次把所有的token看完,然後平行運算,不分先後的機制,所以LLM沒有辦法區分先後順序,那解法就是給他先後順序的位置編碼。
因此在 Transformer 架構下,輸入給 LLM 的句子=Token ID 的語意座標+位置編碼
因為LLM是認識 Token ID 而不是字本身,所以有些人會透過罕見的字詞或是多語言與編碼,來影響LLM,可能在英文輸入敏感詞,安全過濾會很快辨識出來,但是如果攻擊者透過少見的字詞、或是編碼,導致切出來的Token ID安全過濾沒有涵蓋,但是LLM還是看得懂,讓使用者成功越獄。
主要是透過Transformer 的自注意力機制(Multi-Head Self-Attention)和前饋神經網路簡稱FFN(Feed-Forward Network,FFN 也可以叫MLP Multi-Layer Perceptron,多層感知器)。
自注意力機制負責收集上下文的語意,而FFN則是提煉。
(1)自注意力機制(Multi-Head Self-Attention)實際上怎麼運作的?
「它是用來決定模型在處理當前文字時,該關注前後哪些字詞的計算機制。其核心特點是對所有 token一視同仁,不管是系統提示詞還是使用者問的話或是網路上的資料。」
透過自注意力機制的Q、K、V三組向量,可以計算出注意力權重,就是有多重要。
在提示詞注入當中主要是透過嚴謹的設計,將指令符合上下文脈絡拉高整個注意力權重。
在數學上是透過三個向量來計算語意關聯:
分別是Q、K、V三種向量
Query查詢:我現在要關注的是什麼?
Key關鍵線索:其他字可以提供什麼樣的線索?
Value內容:如果線索符合,這個字詞實際的語意數值是多少?
「小岩買了一顆很甜的蘋果,把它送給小花」
當模型處理到它的時候,電腦不知道它是指人、物,還是指蘋果?
所以提出問題Query查詢向量,去確認前面哪一個是甜的?
並且進行計算比對,只有蘋果是可以吃、甜的,分數很高,所以有很高的注意力。
所以將新的理解加進來,它,替換成蘋果。
計算注意力權重(Attention Scores)
又是怎麼算的?拿前面的Q和K做內積,如果相似度愈高,表示分數愈高,也代表這個字對理解越重要。
(2)那接下來前饋神經網路(Feed-Forward Network,FFN / MLP Multi-Layer Perceptron,多層感知器)怎麼去做精練的?
FFN 本質有點像是LLM的大腦,曾經被叫做巨大的鍵值記憶庫(Key-Value Memory),因為FFN有兩層矩陣,第一層Key是在做模式偵測,比對現在的語境和過去的訓練概念,如果高度符合的記憶神經元會被點亮。第二層Value則是負責寫入知識,把被點亮的神經元調用出來,加到原先的token向量當中。
透過自注意力機制和FFN組成的一層Transformer 區塊,然後層層堆疊推理,帶來深度的理解與抽象邏輯,將自注意力機制所捕捉到的上下文資訊,提煉為更高層次的抽象概念與深層邏輯。
但是FFN的角色,也帶來LLM的限制與危險,LLM在訓練的過程中,可能有很多危險知識烙印在FFN,LLM的廠商主要是教LLM拒絕回答,還做不到精準地移除這些特定的危險知識,因此如果發生了越獄,LLM有可能把這些危險知識完整地講出來。